06 - 缓存:省下来的钱和省不掉的风险
前置:01 - 网关是什么。如果读过 03 - 路由与容错 会更好,本篇末尾要把缓存和路由策略连起来。
本篇回答:同一个问题问两遍,第二遍能不能不花钱?"差不多的问题"算不算同一个问题?
会用到的词:
- embedding(向量化):把一段文字变成一个几百到几千维的浮点数组,语义相近的文字对应的向量在空间里也相近
- 余弦相似度 / 欧氏距离:衡量两个向量有多近的两种算法。余弦是越大越像,欧氏是越小越像 —— 这个方向差异下面会变成一个真实的配置陷阱
- TTFT:Time To First Token,首字延迟
一、四层缓存的分工
"AI 缓存"这个词被用得很乱,实际上有四种完全不同的东西,发生在四个不同的位置: